OpenAIがAI評価基準を批判:731問の約3割に欠陥、8か月で通過率は23%から80%に急上昇し信頼性に疑問
OpenAIはSWE-Bench Proのベンチマークを公開して懸念を表明し、731のテストタスクの約30%が評価上の欠陥を抱えていると指摘した。このベンチマークはScale AIによって開発され、大規模なモデルのプログラミング能力を測る業界の権威的な基準とされてきた。しかし、OpenAIは警告し、最新モデルの通過率が8か月で23.3%から80.3%に急上昇したことは異常であり、評価の信頼性に疑問を投げかけている。